Skip to content

GPU/TPU/NPU 等 AI 加速硬件详解

1.3.1 为什么需要 AI 专用硬件?

在深入 GPU 架构之前,先理解一个关键问题:为什么不能只用普通 CPU 来训练 AI 模型?

AI 计算的核心是大量矩阵乘法和向量运算,这类任务天然适合并行化。CPU 和 GPU 的设计目标完全不同:

维度CPUGPU
设计目标擅长复杂控制逻辑和串行任务擅长大规模并行计算
核心数量通常几十个强核心通常数千个简单核心
单核能力相对简单
并行能力有限极强
典型用途操作系统、业务逻辑、通用计算矩阵乘法、深度学习、图形渲染

CPU vs GPU 计算模式

latex
CPU 架构(擅长串行任务)
┌──────────────────────────────────────────────┐
│ 控制单元 │ ALU │ 缓存 │ 控制单元 │ ALU │ 缓存 │
│  复杂   │ 少量 │ 大   │  复杂   │ 少量 │ 大   │
└──────────────────────────────────────────────┘
≈ 8–64 个核心,每个核心强大但数量少

GPU 架构(擅长并行任务)
┌──────────────────────────────────────────────┐
│ 控制单元 │ ALU │ ALU │ ALU │ ... │ ALU │
│  简单   │     大量简单计算单元              │
└──────────────────────────────────────────────┘
≈ 数千个核心,每个核心简单但数量庞大

具体性能对比

操作类型CPU(Intel Xeon)GPU(NVIDIA A100)加速比
矩阵乘法(FP32)3 TFLOPS19.5 TFLOPS6.5x
矩阵乘法(FP16)6 TFLOPS312 TFLOPS52x
内存带宽200 GB/s2,039 GB/s10x
并行线程数646,912108x

核心洞察:AI 计算的核心是大量矩阵乘法和向量运算,这些操作天然适合并行化。GPU 的设计理念就是“用数量换效率”。


1.3.2 GPU 架构深度解析

NVIDIA GPU 架构演进史

latex
2010    2012    2014    2016    2017    2018    2020    2022    2024
  │       │       │       │       │       │       │       │       │
  ▼       ▼       ▼       ▼       ▼       ▼       ▼       ▼       ▼
Fermi  Kepler  Maxwell  Pascal  Volta  Turing  Ampere  Hopper  Blackwell

SM(Streaming Multiprocessor)架构

SM 是 GPU 的基本计算单元,类似于 CPU 的核心,但设计完全不同。一个 SM 内部通常包含:

  • CUDA Core
  • Tensor Core:专门加速矩阵乘加运算;
  • Warp Scheduler:调度线程束执行;
  • 共享内存 / L1 Cache:为高频数据访问提供低延迟存储。

Tensor Core 详解

Tensor Core 是 NVIDIA GPU 的“秘密武器”,专门用于加速矩阵运算。

传统 CUDA Core 做矩阵乘法时,通常需要大量逐元素乘加:

latex
C = A × B
64 × 64 × 64 = 262,144 次乘加运算
每个 CUDA 64 每次做1个乘加 → 需要262,144个时钟周期

而 Tensor Core 使用矩阵乘加单元,一次完成小矩阵块计算:

latex
D = A × B + C
使用 4×4×4 的矩阵乘加单元
⼀次操作完成: D = A × B + C
只需要 (64 / 4)^3 = 4,096 次操作
理论加速比约 64x

Tensor Core 演进

代数架构支持精度核心特性
1stVolta(V100)FP16首次引入,4×4×4 矩阵运算
2ndTuring(RTX)FP16、INT8、INT4增加整数精度支持
3rdAmpere(A100)FP64、FP32、TF32、FP16、BF16、INT8TF32 自动混合精度
4thHopper(H100)上述精度 + FP8Transformer Engine
5thBlackwell上述精度 + 更高 AI 性能性能进一步提升

HBM(高带宽内存)

是 GPU 的“生命线”,决定数据能否及时喂给计算单元。

类型典型场景特点典型带宽
GDDR6游戏显卡芯片分布在 PCB 周围,距离远、功耗高500–800 GB/s
HBM2e / HBM3数据中心 GPU3D 堆叠,与 GPU 核心封装在一起,距离近、功耗低1.5–3.35 TB/s

1.3.3 主流 GPU 型号详细对比

NVIDIA 数据中心 GPU 家族

型号架构显存显存带宽FP32 算力FP16 算力TDP发布时间
V100Volta32GB HBM2900 GB/s15.7 TFLOPS125 TFLOPS300W2017
A100Ampere80GB HBM2e2,039 GB/s19.5 TFLOPS312 TFLOPS400W2020
A800Ampere80GB HBM2e2,039 GB/s19.5 TFLOPS312 TFLOPS400W2022
H100Hopper80GB HBM33.35 TB/s51 TFLOPS989 TFLOPS700W2022
H800Hopper80GB HBM33.35 TB/s51 TFLOPS989 TFLOPS700W2023
H200Hopper141GB HBM3e4.8 TB/s51 TFLOPS989 TFLOPS700W2024
B200Blackwell192GB HBM3e8 TB/s~100 TFLOPS~2000 TFLOPS1000W2024

A100 vs H100 深度对比

指标A100H100提升
FP32 算力19.5 TFLOPS51 TFLOPS+162%
FP16 算力312 TFLOPS989 TFLOPS+217%
显存带宽2,039 GB/s3,350 GB/s+64%

H100 的关键创新

  1. Transformer Engine
    • 自动在 FP16 和 FP8 之间切换;
    • 大模型训练速度可提升 4–6 倍;
    • 通过动态缩放保持精度。
  2. 第四代 NVLink
    • 单链路带宽从 25 GB/s 提升到 50 GB/s;
    • 支持最多 18 条链路;
    • GPU 间总带宽可达 900 GB/s。
  3. DPX 指令
    • 加速动态规划算法;
    • 适用于基因组学、路径规划等场景。

A800 / H800 特别说明

2022 年,美国出口管制政策限制了高性能 GPU 对中国的出口。NVIDIA 推出了 A800 和 H800。

限制项A100 / H100A800 / H800
计算性能完整相同
显存带宽完整相同
NVLink 带宽600 GB/s400 GB/s(-33%)
互联带宽完整降低

对训练的影响:

  • 小规模训练(单节点 8 卡):影响较小;
  • 大规模训练(多节点) 10–30%。

1.3.4 TPU 和 NPU 简介

Google TPU

TPU(Tensor Processing Unit)是 Google 自研的 AI 专用芯片。

以 TPU v4 Pod 为例:

指标数值
芯片数量64 个 TPU v4 芯片
计算核心64 × 2 = 128 个核心
峰值算力275 TFLOPS/chip × 64 = 17.6 PFLOPS
显存容量32GB/chip × 64 = 2TB HBM
网络互联3D Torus

TPU vs GPU 对比

特性TPUGPU
制造商GoogleNVIDIA
软件生态JAX / TensorFlowPyTorch / TensorFlow
可用性主要在 Google Cloud更广泛
灵活性专用架构通用架构
性价比训练大模型较好通用场景更好

国产 NPU

厂商 / 产品代表型号特点
华为昇腾(Ascend)Ascend 910B320 TFLOPS FP16,32GB HBM;支持 CANN 框架,兼容 PyTorch
寒武纪(Cambricon)MLU370256 TFLOPS FP16;支持 MagicMind 推理框架
海光 DCUDCU 系列兼容 CUDA 生态,适用于国产化替代场景

小结

本节介绍了 AI 加速硬件的核心概念:

  • CPU 擅长串行控制,GPU 擅长并行矩阵计算;
  • Tensor Core 是 GPU 加速大模型训练和推理的关键;
  • HBM 决定了数据能否及时供给计算单元;
  • A100、H100、B200 代表了 NVIDIA 数据中心 GPU 的主要演进方向;
  • TPU、国产 NPU 是 GPU 之外的重要 AI 专用硬件路线。

选择 AI 硬件的核心原则:让计算模式、内存带宽、互联能力和软件生态与目标工作负载匹配。

用心记录,持续成长